Méthodes de Monte Carlo

6. Prédiction avec échantillonnage préférentiel (Importance Sampling)

6.1. Apprentissage de types On-Policy et Off-Policy

Toutes les méthodes d'apprentissage par renforcement sont confrontés à un dilemme : elles cherchent à apprendre les valeurs des actions des états à partir de comportements optimums ultérieurs. Mais afin d'explorer toutes les actions possibles pour chacun des états de l'environnement, elles doivent suivre des stratégies qui ne sont pas optimales. On a vu dans les méthodes précédentes comment trouver un compromis : la valeur des actions était apprise à partir de stratégies quasiment optimales afin que l'agent puisse continuer à explorer son environnement. Ces méthodes était basées sur des apprentissages appelés "On Policy", c'est-à-dire qu'une seule stratégie était utilisée pour l'exploration et la recherche d'optimalité.

Une manière plus directe de procéder et d'utiliser deux stratégies : la première dédiée à l'apprentissage et qui deviendra la stratégie optimale, et la deuxième dédiée à l'exploration et qui sera utilisée pour générer un comportement. La stratégie utilisée pour l'apprentissage est appelée la stratégie cible (target policy) et la stratégie utilisée pour générer l'exploration est appelée la stratégie comportementale (behavior policy). On voit ici que l'apprentissage est effectué à l'aide de données qui n'appartiennent pas à la stratégie cible. Cette méthode d'apprentissage est appelée "Off Policy".

Les méthodes de type "Off Policy" sont plus difficiles à mettre en oeuvre et puisque les données sont issues d'une autre stratégie elles convergent souvent moins rapidement et avec une plus grande variance. Cependant ces méthodes sont en général plus puissantes. Par exemple, elles peuvent souvent être appliquées à l'apprentissage de stratégies optimales à partir de données générées par un humain.

Dans cette partie nous allons commencer à étudier ce type d'apprentissage de stratégie dans le cadre de la prédiction, c'est-à-dire la recherche de la fonction des valeurs des états qui nous permettra d'obtenir les valeurs des actions. Le problème va donc être d'estimer $V_\pi$ ou $q_\pi$ en ayant uniquement des trajectoires qui suivent une stratégie $b$ différente de la stratégie $\pi$. Dans ce cas, $\pi$ est la stratégie cible et $b$ est la stratégie comportementale et ces deux stratégies sont considérées comme fixées et connues.

Pour que l'on puisse utiliser des trajectoires issues de la stratégie $b$ afin d'estimer les valeurs pour la stratégie $\pi$, il faut que chaque action prise en suivant la stratégie $\pi$ soit également prise, au moins de manière occasionnelle, en suivant la stratégie $b$. Cela nécessite donc que si $\pi \left( {a|s} \right) > 0$ alors on ait $b \left( {a|s} \right) > 0$. C'est ce qu'on appelle l'hypothèse de couverture. Cela implique que la stratégie $b$ doit être aléatoire sur les états qui ne suivent pas le comportement de la stratégie $\pi$. Par contre la stratégie cible $\pi$ peut être déterministe. Elle est d'ailleurs typiquement la stratégie optimale par rapport à la fonction des valeurs d'actions. Cette stratégie devient une stratégie optimale déterministe alors que la stratégie comportementale reste aléatoire et plus exploratrice, par exemple une stratégie de type $\varepsilon-greddy$.